Operator: SELU-Affine-Gate (Fused CUDA Kernel)

Goal
- Fuse affine, SELU activation, sigmoid gate, and multiply; target ≥1.30x speedup.

Definition
- z = x * scale + bias
- m = SELU(z) = lambda * (z >= 0 ? z : alpha * (exp(z) - 1))
- g = sigmoid(alpha_g * m + beta)
- y = x * g
